1北京林业大学信息学院
2国家林业草原林业智能信息处理工程技术研究中心
TL;DR提出ECVC模型,通过vCLUB互信息最小化解耦内容、说话人、音高和情感四元特征,并引入情感一致性损失,实现情感保留的高质量语音转换
现有基于VITS的语音转换模型仅解耦内容和说话人信息,忽略了音高和情感等非语言信息,导致转换语音情感泄漏。本文提出ECVC模型,采用vCLUB衡量并最小化风格/情感特征与其他特征间的互信息,实现内容、说话人身份、音高和情感四元特征的充分解耦。同时在联合训练的情感编码器中引入情感一致性损失,提高转换语音与源语音的情感相似度。
基于VITS的语音转换模型(如FreeVC)的说话人编码器存在情感泄漏问题——目标说话人的情感信息会随说话人特征一起泄露给解码器,导致转换后语音情感特征歧义,无法保持源说话人的情感状态。
通过vCLUB互信息最小化将内容、说话人、音高和情感四元特征相互解耦,消除特征间泄漏;在情感编码器中引入情感一致性损失(L1距离),惩罚源语音与转换语音情感特征差异,确保转换语音保留源说话人情感信息而非目标说话人情感。
由预训练情感风格编码器、两个带Leaky ReLU的全连接层、额外全连接层及SoftMax层组成。情感一致性损失L_embed=||E_e(X_s)-E_e(X_t)||_1,惩罚源语音与转换语音情感特征差异。
采用vCLUB作为互信息无偏估计,设计全局MI最小化方法,最小化内容/说话人/音高/情感四元特征两两之间的互信息,确保四者相互独立。
引入预训练F0编码器提取音高特征Z_p=E_p(X),与内容特征Z_c、说话人特征Z_s、情感特征Z_e共同参与后验编码器编码,确保转换语音保留源语音的音高变化模式。
ECVC在FreeVC基础上改进:使用联合训练的情感编码器并引入情感一致性损失,同时使用互信息最小化解耦语音特征,还引入预训练F0编码器保持音高信息。说话人编码器和内容编码器遵循FreeVC,后验编码器、解码器和鉴别器遵循VITS。
情感编码器直接从语音中获取潜在情感特征,采用vCLUB互信息作为相关度量减少情感特征与其他特征依赖性。情感一致性损失在模型具备基本语音合成能力后引入,最小化源语音与转换语音情感特征的L1距离。
全局互信息最小化扩展了VQMIVC的说话人MI损失,将内容特征Z_c、说话人特征Z_s、音高特征Z_p和情感特征Z_e全部纳入互信息最小化框架。由于情感与说话人解纠缠较复杂,设置lambda_2=2*lambda_1增强解耦效果。
| Method | Embedding MAE↓ | F0-PCC↑ | pMOS↑ | MCD↓ |
|---|---|---|---|---|
| FreeVC | 90.3 | 0.826 | 4.59 | 5.21 |
| VQMIVC | 81.7 | 0.803 | 2.59 | 6.98 |
| Emo-StarGAN | 31.1 | 0.776 | 3.86 | 4.75 |
| ECVC (w/o SR) | 29.4 | 0.823 | 4.32 | 3.94 |
| ECVC ours | 27.1 | 0.843 | 4.41 | 3.64 |
在ESD数据集上,ECVC在五种情感(Angry/Happy/Neutral/Sad/Surprise)的客观评测中Embedding MAE均显著优于FreeVC和Emo-StarGAN。F0-PCC在所有情感上均高于基线,验证了音高保留能力。主观评测中SMOS(4.03)、EMOS(4.05)和N-MOS(4.25)均为最优。消融实验表明情感一致性损失对情感保存贡献最大。
互信息最小化是解耦语音中纠缠特征的有效手段。vCLUB提供无偏的互信息估计,结合情感一致性损失可在保持说话人相似度的同时显著提升情感保留率。显式建模情感特征并约束其与说话人特征的正交性,是解决语音转换中情感泄漏问题的核心策略。
@inproceedings{li2024ecvc,
title={基于互信息特征解耦的情感一致性语音转换方法},
author={李渡渡 and 王少荣 and 甄怡宁 and 王春玲},
booktitle={第十九届全国人机语音通讯学术会议(NCMMSC 2024)},
year={2024}
}